METEOR, CIDEr, BERTScore
Перечислим идеи других методов оценки качества сгенерированных текстов, помимо перплексии, WER, CER, BLEU и ROUGE.
METEOR
Мера METEOR (Metric for Evaluation of Translation with Explicit ORdering, [1]) была создана для решения проблемы строгого совпадения слов в BLEU и ROUGE. Используя встроенные лингвистические базы (такие как WordNet) и алгоритмы стемминга, алгоритм ищет не только точные совпадения, но и совпадения корней слов, а также совпадения по синонимам, что обеспечивает более высокое качество сравнения текстов.
CIDEr
Мера CIDEr (Consensus-based Image Description Evaluation, [2]) разработана специально для задач, где есть множество эталонов для текстового описания изображений и видео. В основе лежит принцип TF-IDF. Если какое-то слово (или n-грамма) встречается во всех эталонных описаниях изображения, оно считается важным и учитывается с более высоким весом. Однако, если слово часто встречается по во всём датасете (например, союзы, предлоги или слово "изображение"), его вес снижается.
BERTScore
Традиционные метрики (BLEU, ROUGE) опираются на точное совпадение слов или словари синонимов (METEOR). BERTScore [3] вместо самих слов использует их контекстные эмбеддинги, получаемые из предобученных моделей, таких как BERT и RoBERTa. Для оценки схожести текстов вычисляется косинусное сходство между эмбеддингами сгенерированных слов и слов эталона, что позволяет производить сравнение текстов на очень глубоком семантическом уровне по смыслу, даже если эти тексты сформулированные совершенно по-разному. BERTScore активно применяется для оценки качества машинного перевода, суммаризации и диалоговых систем.